Micron Document
____ _ _ _ _
| _ \ ___ | |_ (_) _ __ ___ __| | (_) __ _
| |_) | / _ \ | __| | | | '_ \ / _ \ / _| | | | / _ |
| _ < | __/ | |_ | | | |_) | | __/ | (_| | | | | (_| |
|_| \_\ \___| \__| |_| | .__/ \___| \__,_| |_| \__,_|
|_|


The NomadNet German & English Wikipedia | Archives | Info
- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b

🔍 Search

¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯

Common Voice
──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────
top
Common Voice ist ein 2017cite-ref-1[1] von Mozilla gestartetes Crowdsourcing-Projekt zur Sammlung von Sprachdaten, die aus der Aufnahme von vorgelesenen Sätzen oder Worten bestehen. Die Daten stammen aus vielen Sprachen und werden von Freiwilligen eingesprochen und überprüft.

Nach der Anmeldung auf dem Portal von Common Voice, das mit einem Ziel- und Belohnungssystem für die Teilnahme ausgestattet ist, werden entweder Beispielsätze aus der Wikipedia zum Lesen und Aufnehmen oder die Aufnahmen anderer Nutzer zur Verifizierung angeboten. Die gesamten Daten sind gemeinfrei („CC0“). Common Voice erschien als Antwort auf die Sprachassistenten der großen Unternehmen, wie Amazon Echo, Siri oder Google Assistant.cite-ref-2[2]cite-ref-3[3]

Contents


──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────

Namensgebung

Der Name „Common Voice“ stammt aus dem Englischen und bedeutet übersetzt etwa „gemeinsame Stimme“. Mozilla hat den Namen in Anlehnung an Creative Commons gewählt, was auf den gemeinsamen Grundgedanken des Allgemeinguts zurückzuführen ist.cite-ref-4[4]

Geschichte

Seit dem 6. Juni 2018 können auch deutsche Sätze eingesprochen und überprüft werden.cite-ref-5[5] Es existiert eine inoffizielle Android-App.cite-ref-6[6]

Seit 2021 unterstützen Nvidia, die Bill & Melinda Gates Foundation, die Deutsche Gesellschaft für Internationale Zusammenarbeit und das britische Foreign and Commonwealth Office das Projekt.cite-ref-golem-7-0[7]cite-ref-8[8]cite-ref-9[9]

Statistik

Die englische Datenbank von Common Voice ist mittlerweile die größte frei zugängliche Sprachdatenbank.cite-ref-golem-7-1[7] Der Digitalisierungsfortschritt in den meisten Sprachen ebbte nach kurzer Zeit ab, nur in wenigen Fällen kam eine kritische Masse zustande:cite-ref-10[10]

| Sprache | h validiert 2019-12-10 (4.0) | h validiert 2022-07-04 (10.0) | h validiert 2022-09-21 (11.0) | h validiert 2023-03-09 (13.0) | 14.0 | Organisator |
|---|---|---|---|---|---|---|
| Englisch | 1118 | 2275 | 2319 | 2428 | 2484 | / |
| Katalanisch | 246 | 1390 | 1700 | 2014 | 2400 | AINA [ 11 ] |
| Kinyarwanda | | 2001 | 2001 | 2001 | 2001 | Digital Umuganda [ 12 ] |
| Belarussisch | | 1089 | 1159 | 1341 | 1511 | ? |
| Esperanto (keine Standardaussprache) | | 1872 [ 13 ] | 1414 | 1431 | 1430 | [ 14 ] |
| Deutsch | 483 | 1136 | 1157 | 1257 | 1290 | / |
| Französisch | 350 | 868 | 906 | 941 | 958 | / |
| Kabylisch | 263 | 553 | 564 | 565 | 565 | Universität Tizi Ouzou etc. [ 15 ] |
| Spanisch | 168 | 411 | 413 | 482 | 503 | / |
| Luganda | | 407 | 408 | 437 | 437 | [ 16 ] |
| Persisch | 212 | 327 | 344 | 355 | 357 | |
| Suaheli | | / | 326 | 338 | 348 | bezahlt von Mozilla [ 17 ] |
| Italienisch | 85 | 321 | 326 | 342 | 346 | |
| Baschkirisch | | 256 | 256 | 257 | 257 | [ 18 ] |
| Chinesisch | | 64 | 130 | 227 | 231 | |
| Tamil | | 224 | 225 | 229 | 229 | |
| Olyk-Mari | | 114 | 133 | 148 | 175 | ? |

Verwandte Projekte

• LibriSpeech: Sprachkorpus von ungefähr 1000 Stunden englischsprachiger Hörbücher aus LibriVox (CC BY 4.0).
• TED-LIUM: Sprachkorpus von ungefähr 118 Stunden aus englischsprachigen TED-Talks (CC BY-NC-ND 3.0).
Tatoeba: Sammlung von (gesprochenen) Beispielsätzen in verschiedenen Sprachen mit Übersetzungen (Texte CC BY 2.0, Audio größtenteils CC BY-NC-ND 3.0).
• VoxForge: Sprachkorpus in verschiedenen Sprachen, um freie Spracherkennungs-Engines, wie Julius zu unterstützen (GPL 3).
• Thorsten (Stimme) deutscher Sprachkorpus einer Person für TTS-Sprachmodelle (CC0-Lizenz)

Weblinks

Commons

: Common Voice

– Sammlung von Bildern, Videos und Audiodateien

• Common Voice – Offizielle Website

Einzelnachweise

cite-note-11. Daniel Kessler: Raising Our Common Voice For The Web. In: The Mozilla Blog. 19. Juni 2017, abgerufen am 26. Januar 2018 (amerikanisches Englisch).
cite-note-22. Frequently Asked Questions. In: Common Voice. Abgerufen am 26. Januar 2018 (amerikanisches Englisch).
cite-note-33. Wolfgang Reszel: Mozilla sammelt Stimmaufzeichnungen für offene Spracherkennungs-Software. In: heise online. 23. Juli 2017, abgerufen am 26. Januar 2018.
cite-note-44. Sebastian Grüner: Mozilla bringt freie Spracherkennung für alle (Seite 2). In: Golem.de. 30. November 2017, abgerufen am 26. Januar 2018.
cite-note-55. Sebastian Grüner: Common Voice: Mozillas freie Sprachdatenbank wird mehrsprachig. In: Golem.de. 7. Juni 2018, abgerufen am 7. Juni 2018.
cite-note-66. Spende deine Stimme: CV Project – Apps bei Google Play. Abgerufen am 10. März 2021.
cite-note-golem-77. Ulrich Bantle/Linux Magazin/Sebastian Grüner: Mozilla erweitert freien Sprachdatensatz massiv. In: Golem.de. 6. August 2021, abgerufen am 6. August 2021.
cite-note-88. Mozilla Common Voice Receives $3.4 Million Investment to Democratize and Diversify Voice Tech in East Africa. In: mozilla.org. 25. März 2021, abgerufen am 6. August 2021 (englisch).
cite-note-99. Mozilla partners with NVIDIA to democratize and diversify voice technology. In: mozilla.org. 12. April 2021, abgerufen am 6. August 2021 (englisch).
cite-note-1010. github.com
cite-note-111. projecteaina.cat
cite-note-122. foundation.mozilla.org
cite-note-133. muss ein Fehler sein validHrs: 1872.42 > totalHrs: 1430.21
cite-note-144. telegra.ph
cite-note-155. discourse.mozilla.org
cite-note-166. Archivierte Kopie (Memento des Originals vom 15. August 2022 im Internet Archive) Info: Der Archivlink wurde automatisch eingesetzt und noch nicht geprüft. Bitte prüfe Original- und Archivlink gemäß Anleitung und entferne dann diesen Hinweis.@1@2Vorlage:Webachiv/IABot/events.mak.ac.ug
cite-note-177. Chenai Chair: Maendeleo: Mozilla’s Kiswahili Common Voice Work Continues, 23. September 2021.
cite-note-188. Башҡорт телмәрен цифрлаштырыу